Type: concept
Confidence: 0.90
Created: 2026-04-20
Updated: 2026-04-20
Tags: ai-engineeringevaluationagent质量保障AI工程

Agent 评测体系

概述

Agent 评测体系是 AI Agent 质量保障的完整方法论,涵盖 Task/Trial/Grader/Transcript/Outcome 的术语定义、三类评分器选择策略、以及四类 Agent(编码、对话、研究、计算机使用)的具体评测方案。

关键内容

  1. 核心术语体系
  2. Task(任务):有定义输入和成功标准的测试
  3. Trial(试验):一次 Task 尝试(因 Agent 随机性需多次试验)
  4. Transcript/Trace(记录/轨迹):Trial 的完整记录,包含所有工具调用
  5. Outcome(结果):Trial 结束时环境的实际最终状态(客观事实,非 Agent 自我报告)
  6. Grader评分器:对 Transcript 或 Outcome 进行打分的逻辑
  7. Evaluation Suite(评测套件):多个 Task 的集合
  8. Evaluation Harness评测框架:运行评测的基础设施
  9. Agent Harness(Agent 框架):让模型作为 Agent 行动的系统

  10. Transcript vs Outcome 的关键区分

  11. 航班预订 Agent 说"您的航班已预订"(Transcript 声明)
  12. 评测者检查 SQL 数据库中是否存在预订记录(Outcome 验证
  13. 好的评测验证 Outcome,不相信 Transcript 声明

  14. 评测悖论

  15. Agent 的自主性、智能性、灵活性使其有用,但也使其难以评测
  16. 无法预知执行路径、可能"绕过"评测假设、评测无法覆盖所有路径
  17. Opus 4.5 案例:发现评测策略漏洞并利用,技术上"失败"但实际找到更优解

  18. 没有 eval 的代价

  19. 用户报告 Agent 变差,团队无法量化
  20. 调试完全被动:等待投诉 → 手动复现 → 修复 Bug → 希望没有新回退
  21. 无法区分真实回退与噪声
  22. 新模型发布时需数周测试,而有 eval 的竞争对手只需数天

来源

相关